Vzorečky na statistiku
Statistika 1. hodina Úvod do statistiky
Statistika 2. hodina Deskriptivní statistika
Statistika 3. hodina Univariační analýza numerické charakteristiky
Statistika 4. hodina Počítání s dekriptivní statistikou
Statistika 5. hodina Bivariační analýza
Statistika 6. hodina Korelace

Deskriptivní statistika

flowchart TD
    B["Deskriptivní Statistika"]
    B-->C[Rozdělení]
    B-->D(Míry centrální tendence) 
    D -->E(Průměr)
    D -->F(Medián)
    D -->G(Modus)
    B-->H(Míry variability)
    H -->I(Rozpětí)
    H -->J(Interkvartilová odchylka)
    H -->K(Směrodatná odchylka)
    H -->L(Variační rozpětí)

Rozdělení frekvencí

Míry centrální tendence

Průměr (mean, x¯)

x¯=∑i=1nxin

Medián (med,Q2)

střední hodnota souboru, který je seřazen od nejmenší po největší hodnotu

x=n+12 Median=xn2+xn2+12

Modus

Míry variability

Rozpětí

Interkvartilová odchylka

Kvartily

Q1 14(n+1)
Q2 24(n+1)
Q3 34(n+1)
Q4 maximum

Pasted image 20231115120207.png

Rozptyl a Směrodatná odchylka

Rozptyl je průměr čtverců odchylek od průměru

Vzorec rozptylu:

σ2=1n∑i=1n(xi−x¯)2

Směrodatná odchylka v průměru řekne, jak daleko leží každé skóre od průměru

Vzorec směrodatné odchylky

σ=1n∑i=1n(xi−x¯)2

Variační koeficient

jestliže chceme posoudit relativní velikost rozptýlenosti dat vzhledem k průměru

CV=(SDx¯)×100%

Korelační koeficienty

Pearsonův

popisuje lineární vztah mezi dvěma kvantitativními proměnnými.

předpoklady, které musí data splňovat, pokud chcete použít Pearsonovo r:

je parametrický test, takže má vysoký výkon

Ale není to dobré měřítko korelace, pokud mají proměnné nelineární vztah nebo pokud data mají odlehlé hodnoty, zkreslená rozdělení nebo pocházejí z kategorických proměnných

Vzorec

r=∑(xi−x¯)(yi−y¯)∑(xi−x¯)2∑(yi−y¯)2

Spermanův

nejběžnější alternativou k Pearsonově

Je to korelační koeficient pořadí, protože používá pořadí dat z každé proměnné (např. od nejnižší po nejvyšší) spíše než samotná nezpracovaná data

Spearmanův byste měli použít, když vaše data nesplňují předpoklady Pearsonova

K tomu dochází, když je alespoň jedna z vašich proměnných na ordinální úrovni měření nebo když data z jedné nebo obou proměnných nesledují normální rozdělení.

Zatímco Pearsonův korelační koeficient měří linearitu vztahů, Spearmanův korelační koeficient měří monotónnost vztahů

V lineárním vztahu se každá proměnná mění v jednom směru stejnou rychlostí v celém rozsahu dat

V monotónním vztahu se také každá proměnná vždy mění pouze jedním směrem, ale ne nutně stejnou rychlostí.

Vzorec:
Základní

ρ=1−6∑(xi−yi)2n(n2−1)

Upravený o diviaci di - rozdíl mezi x a y

ρ=1−6∑(di)2n(n2−1)

Pro fajnšmekry, kompletně upravený

ρ=1−6∑(di)2n3−n

Kendalův

Vzorec
C - konrodtantní, +, jsou větší, souhlasné páry
D - diskonkordatní, -, jsou měnší, nesouhlasné páry

τ=C−DC+D
Příklad

Dva učitelé seřadí 12 svých žáků od nejhoršího po nejlepšího. Máme dva sloupce hodnocených dat, je vhodné použít Kendalla
Budeme se dívat pouze na pozice u Učitele dva.

Hráč Učitel 1 Učitel 2
Aj 1 1
Ben 2 2
Ellito 3 3
Conner 4 5
Duane 5 4
Frank 6 7
Greg 7 6
Hank 8 8
Isaiah 9 10
Jim 10 9
Kurt 11 11
Luke 12 12